Видео с ютуба Faster Llm Inference
How KV Cache Speeds Up LLMs for Faster AI Models on GPUs
Faster LLMs: Accelerate Inference with Speculative Decoding
Почему делать логические выводы сложно...
Deep Dive: Optimizing LLM inference
KV Cache: The Trick That Makes LLMs Faster
Your local LLM is 10x slower than it should be
Почему разделение фаз префилла и декодинга ускоряет работу LLM | vLLM, LLM-D и NIXL
Как ускорить работу LLM в 17 раз (KV-кэш с нуля)
Что такое NVFP4? Ускоренный вывод LLM без потери качества
AI Inference: The Secret to AI's Superpowers
Невероятно быстрый вывод LLM с этим стеком
What is vLLM? Efficient AI Inference for Large Language Models
What Is Llama.cpp? The LLM Inference Engine for Local AI
Qwen 3.8-27B: как быстро запустить модель
Освоение оптимизации вывода LLM: от теории до экономически эффективного внедрения: Марк Мойу
Быстрый инференс расширяет возможности разработки
Быстрый вывод LLM с нуля
FAST '26 - Accelerating Model Loading in LLM Inference by Programmable Page Cache
Почему диффузионные LLM работают так быстро?
NVIDIA DGX Spark против RTX 4090 | Вывод LLM, скорость обучения и многое другое